Type: paper
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-18
Tags: 论文机器学习深度学习神经网络

Learning Representations by Back-propagating Errors

概述 (50-200字符)

1986 年发表于 Nature 的里程碑论文,仅 4 页,首次系统阐述了反向传播算法用于训练多层神经网络。该论文使多层感知机的训练成为可能,直接开启了现代深度学习的大门。

关键内容 (≥300字符, 用双链)

  1. 核心贡献:论文给出了误差从输出层沿计算图逆向传播的完整数学推导,用微积分链式法则计算每个权重对误差的贡献,然后梯度下降更新。关键洞见是"每一层只需知道从上层传来的误差信号和自己局部的导数"——完全局部化,可以无限叠加层数。
  2. 解决的历史难题感知机的 XOR 危机后,神经网络研究沉寂了十余年。多层网络理论上可解决非线性问题,但隐藏层权重无法训练。这篇论文彻底解答了"中间隐藏层的权重该怎么训练"这一根本问题。
  3. 算法效率:论文证明了反向传播相比数值微分(对每个参数做一次前向传播)的效率优势:一次前向+一次反向 = O(1) 次前向传播的计算量,训练速度提升 N 倍(N 为参数量)。这一效率优势使大规模神经网络训练成为现实。
  4. 历史地位:尽管反向传播的思想更早已有人提出(如 Werbos 1974),但这篇 Nature 论文以其简洁性和影响力使其成为深度学习领域的奠基之作。无论 CNN、RNN、Transformer,所有现代深度学习架构的训练都依赖 BP。自动微分框架(PyTorch/TensorFlow)的核心即 BP 的工程化实现。

来源

相关